-
HALO 论文精读:让 VLA 先思考、再想象、后行动精读 HALO:用 Mixture-of-Transformers 将文本推理、视觉子目标预测与动作生成统一为 Embodied Multimodal Chain-of-Thought,并分析其训练配方、实验和代码现状。
15 min read -
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台精读 Genie Envisioner:GE-Base 如何用多视角视频世界模型承载 GE-Act 动作解码、GE-Sim 闭环模拟与 EWMBench 评测。
26 min read -
FTP-1 论文精读:把异构触觉做成可迁移的基础策略FTP-1 用形态感知触觉 Token 空间和共享触觉专家,将 21 种传感器、26 个数据源的触觉经验迁移到接触密集操作。
21 min read -
Fast-in-Slow 论文精读:把高速执行嵌入慢速推理的统一 VLA精读 Fast-in-Slow(FiS-VLA):通过共享 VLM 末端 Transformer、异步双系统、3D 点云与双感知协同训练,同时获得高频控制和语义推理能力。
18 min read -
Evo-0 论文精读:让 VLA 从 RGB 中获得隐式空间理解精读 Evo-0:用 VGGT 的几何 token 和轻量 Cross-Attention 融合模块,为现有 VLA 注入无需深度传感器的隐式 3D 先验。
14 min read -
Ctrl-World 论文精读:让世界模型在想象中评估和改进机器人策略精读 Ctrl-World:用多视角联合预测、位姿条件记忆检索和逐帧动作条件,把 Stable Video Diffusion 改造成可控的机器人世界模型。
24 min read -
Adaptive Action Chunking 论文精读:让 VLA 在推理时自己决定执行多长精读 AAC:用多候选动作的 action entropy 在推理时自适应选择 chunk size,在不改训练架构的情况下平衡 VLA 的反应性与时间一致性。
20 min read -
VISTA:Scaling World Model 论文精读精读 VISTA:用可生成的视觉子目标把 Embodied World Model 变成高层规划器,再由 GoalVLA 执行低层动作,提升少样本机器人操作的 OOD 泛化。
21 min read -
villa-X 论文精读:用物理接地的 Latent Action 连接 VLA 规划与控制精读 villa-X:用 proprioceptive FDM 让 latent action 对齐机器人动力学,再以 joint diffusion 联合规划 latent action 与低层动作,实现跨 embodiment 的 VLA 迁移。
19 min read -
MolmoAct 论文精读:空间推理 Action Reasoning Model精读 MolmoAct:用深度感知 token、视觉轨迹 trace 与离散动作 token,把 VLA 的感知、规划和控制组织成可解释、可 steer 的三阶段推理。
14 min read -
CoT-VLA 论文精读:让机器人先想象目标,再执行动作精读 CoT-VLA:用未来子目标图像作为视觉 Chain-of-Thought,再通过混合注意力和 Action Chunking 生成闭环动作。
27 min read -
Qwen-RobotManip 论文精读:对齐如何释放机器人规模化精读 Qwen-RobotManip:通过跨 embodiment 对齐、相机坐标系动作、人到机器人合成与双流训练,把约 38,100 小时开放数据转化为可迁移的 VLA 能力。
19 min read